-
DreamControl-v2 论文精读:让人形机器人在自身空间里“做梦”精读 DreamControl-v2:把异构人体动作预先重定向到 Unitree-G1 空间,用可控扩散先生成参考轨迹,再以物理 RL 学习可自主执行的全身技能。
16 min read -
ThinkAct 论文精读:用视觉潜变量让 VLA 先思考再行动精读 ThinkAct:用动作对齐的视觉奖励通过 GRPO 训练 embodied reasoning,再以视觉计划 latent 条件化 DiT Action Model,实现长时规划、少样本适应与自纠错。
14 min read -
SimpleVLA-RL 论文精读:用在线强化学习扩展 VLA 的数据与泛化能力精读 SimpleVLA-RL:基于 veRL 为 OpenVLA-OFT 接入闭环并行 rollout、二值结果奖励与探索增强,在 LIBERO、RoboTwin 和真实机器人上验证 VLA 的 RL scaling。
18 min read -
RynnValue 论文精读:用时间距离训练可扩展的机器人价值基础模型RynnValue 用从观测到语言目标的剩余时间替代偏好与归一化进度,在 7,000+ 小时异构机器人数据上训练价值模型,并作为 VLA 的密集奖励接口。
22 min read -
RLinf-VLA 论文精读:统一且高效的 VLA 强化学习框架精读 RLinf-VLA:用统一接口连接 VLA、PPO/GRPO 与多种模拟器,并通过混合 GPU 分配和细粒度流水线提升具身强化学习效率。
18 min read -
πRL 论文精读:为 Flow-based VLA 打通 Online RL精读 πRL:将 flow matching 的去噪过程改写为可计算似然的随机策略,使 π0 与 π0.5 能以 PPO 从在线交互中继续提升。
16 min read -
OmniVLA-RL 论文精读:空间理解与在线强化学习统一的 VLA精读 OmniVLA-RL:用 MoT 三专家与 Block-wise Causal Attention 融合空间、语义和动作,并以 Flow-GSPO 稳定优化 Flow Matching 策略。
16 min read